вернуться в раздел "Научные труды"

Семантическая интеграция разнородных баз данных одного домена с использованием онтологии

АННОТАЦИЯ

Интеграция разнородных баз данных — это исследование, посвященное объединению данных из нескольких баз данных. Интеграция разнородных баз данных одного домена сопряжена с тремя основными проблемами, которые затрудняют решение проблемы неоднородности. Эти три проблемы — семантическая, синтаксическая и структурная неоднородность. Традиционные схемы интеграции разнородных баз данных, такие как методы дедупликации, хранилища данных (Data Warehouse) и методы поиска информационного поиска (IR), не обладают возможностью полностью решить задачу интеграции баз данных. Единственная причина заключается в том, что они не могут эффективно справляться с проблемами семантической неоднородности. В статье исследуется и обсуждается модель онтологии семантической веб-паутины, основанная на модели выполнения запросов. Моделирование онтологии разделено на две фазы: сначала преобразование правил базы данных в соответствии с правилами онтологии для поиска абстрактной онтологической модели; во-вторых, расширение абстрактной онтологической модели в соответствии с базами данных. Метод позволяет применять аналогичные SPARQL-запросы для поиска данных в базах данных. Поэтому для извлечения семантически похожих записей используется Jena API. Эксперимент основан на двух разнородных библиотечных базах данных университетов. Результаты демонстрируют эффективность и масштабируемость методологии.

ИНДЕКСНЫЕ ТЕРМИНЫ: Семантическая интеграция, Семантическая веб-паутина, Моделирование онтологий, Библиотечные базы данных.

1. ВВЕДЕНИЕ

Семантическая веб-паутина позволяет компьютерам обрабатывать веб-информацию и превратила веб в среду, в которой различные машины могут понимать друг друга [1], [2]. Семантическая веб-паутина помогает автоматизированной системе понимать, совместно использовать и обрабатывать разнородную информацию, размещенную на схожих или разных машинах. Технология семантической веб-паутины поддерживается онтологической моделью для классификации и соответствующей интеграции информации. Онтологические модели используются для извлечения неявной и явной информации с помощью SPARQL-запросов [3]. Онтологические модели обладают способностью интегрировать разнородные данные на основе методов классификации и отношений (т.е. троек) [4]. Следовательно, онтологическая модель используется для интеграции разнородных баз данных (т.е. структурной неоднородности), как обсуждается в статьях [3], [4]. Структурная неоднородность баз данных означает наличие набора различных баз данных, хранящих схожие концепции данных реального мира, но в различных структурах. Примерами структур баз данных являются реляционные базы данных, полуструктурированные базы данных и неструктурированные базы данных.

Ассоциированный редактор, координирующий рецензирование этой рукописи и утверждающий ее для публикации, — Honghao Gao.

Таким образом, возникает общий вопрос: как эффективно получать доступ к данным, находящимся в разнородных базах данных, и совместно их использовать? В начальную эпоху использовались только веб-страницы и веб-сайты, где базы данных не были задействованы, поэтому для извлечения информации использовался No-SQL. Веб использовался для поиска каких-либо описаний или деталей. В настоящее время веб-приложения используют базы данных. Поэтому были разработаны различные типы реляционных баз данных, что может создавать проблемы при интеграции общих данных. Большинство веб-сайтов поддерживаются базами данных, как обсуждается в [5], 70% веб-сайтов используют базы данных для хранения. Данных в веб-базах данных в 500 раз больше, чем в статическом вебе. В [5] обсуждается важность баз данных, поэтому интеграция разнородных баз данных является важной задачей для повышения производительности современных веб-приложений. Следовательно, необходимо преобразовать связанные базы данных в эквивалентную онтологию для интеграции информации [6], находящейся в базах данных.

Реляционная база данных (RDB) состоит из таблиц, которые связаны друг с другом на основе одинаковых ограничений целостности [7]. Таблица в RDB представляет собой комбинацию столбцов (атрибутов) и строк (кортежей). Каждый кортеж представляет конкретную запись. RDB — это комбинация статических, динамических или поведенческих структур. Статическая структура включает таблицы, столбцы, типы данных, первичные и внешние ключи. Динамические или поведенческие особенности включают функции, процедуры, триггеры и представления. Только статическая структура баз данных может быть преобразована в онтологию, потому что онтологическая модель не может работать с поведенческими особенностями баз данных [8]. Концептуальные модели схожи как для онтологии, так и для схемы базы данных. Сущности таблиц RDB могут использоваться как концепции в онтологической модели. Таблицы RDB имеют кортежи и атрибуты, ограничения целостности и отношения с другими таблицами, тогда как в онтологических моделях классы имеют экземпляры и объектные свойства, а также ограничения на свойства, соответственно.

Для эффективного доступа к данным, находящимся в разнородных базах данных, и их совместного использования требуется единая модель запросов. Данные могут быть представлены в базах данных бесконечным числом способов, что известно как репрезентационная неоднородность (RH). Для решения RH данные в базах данных представлены с использованием различных схем моделирования, таких как реляционные, иерархические, плоские файлы (т.е. неструктурированные базы данных) или объектно-ориентированные схемы моделирования данных. Например, в данной исследовательской работе для эксперимента выбраны две библиотечные базы данных. Одна из баз данных разработана в соответствии с правилами RDB, а другая использует модель данных плоского файла для записи аналогичной информации, такой как имя автора, название книги и т.д. Обе базы данных хранят схожую информацию, но в разных моделях данных, поэтому представление данных в обеих базах данных различно. Следовательно, хранение схожих данных в разных базах данных порождает семантическую, структурную и синтаксическую неоднородность. Семантическая неоднородность означает, что имена таблиц или атрибутов в разных базах данных одинаковы, но в реальной жизни они относятся к разным сущностям или объектам. Синтаксическая неоднородность (или неоднородность именования) означает, что имена таблиц или атрибутов в разных базах данных различны, но они относятся к одним и тем же сущностям или объектам реального мира. Структурная неоднородность утверждает, что структура или формат хранения данных в различных базах данных различается. В заключение, при интеграции баз данных всегда остается какая-то неоднородность. Для полной интеграции баз данных все такие проблемы должны быть решены.

Интеграция разнородных баз данных решается с использованием двух методов: 1) Преобразование данных или 2) Преобразование запросов. С помощью техники преобразования данных данные из базы данных преобразуются [9]. Преобразование данных может изменить представление данных. Согласно технике преобразования запросов, запросы преобразуются с помощью нативного программного приложения для доступа к информации из нескольких баз данных [10]. Например, существует база данных реального времени, которая часто обновляется. Требованием пользователей является получение наиболее часто обновляемых данных из базы данных. Для выполнения такого требования можно использовать либо преобразование данных, либо преобразование запросов. Преобразование данных переводит все данные из базы данных, и процесс занимает много времени, поэтому преобразовывать данные после каждого обновления в базе данных нецелесообразно. Преобразование запросов, с другой стороны, переводит пользовательские запросы в нативный запрос базы данных во время выполнения. Преобразование запросов занимает меньше времени, чем процесс преобразования данных, и извлекает самые последние обновленные данные для пользователей. Схема преобразования данных предпочтительна для баз данных, где данные в базе данных не нуждаются во многих обновлениях. Примером таких баз данных может быть база данных для хранения исторических событий страны, поскольку такие события являются частью истории и не требуют частых обновлений.

Преимущество схемы преобразования данных — ее способность эффективно получать доступ к данным, хранящимся в одном источнике данных. Недостатки: 1) Любое обновление в любой базе данных требует сложной конструкции приложения для соответствующего обновления схемы преобразованных данных, что иногда почти невозможно. 2) Схема преобразования данных увеличивает стоимость хранения информации, потому что одни и те же данные хранятся в различных местах, поэтому репликация данных является еще одним недостатком.

Записи базы данных очень часто обновляются в приложении базы данных реального времени. Поэтому в исследовании используется техника преобразования запросов, поскольку она подходит для приложений баз данных реального времени, если для интеграции баз данных используется единая платформа. Следовательно, онтологические модели [11], [12] используются для интеграции разнородных баз данных на единой платформе. Онтологическая модель также предоставляет язык запросов, т.е. SPARQL, для извлечения результатов из онтологической модель.

Вклад этой статьи заключается в интеграции структурно разнородных баз данных на одной платформе: без повторного преобразования баз данных или перепроектирования существующей структуры (т.е. RDB) или моделей (т.е. RDF). Методология обсуждается следующим образом: интегрировать различные схемы баз данных от кортежей RDB к одной модели языка веб-онтологий (OWL) с использованием семантической классификации. Преимущество методологии — эффективный доступ к данным без ошибок человека или системы, поскольку пользователю нужно только предоставить запрос для доступа к записям. Пользовательский запрос автоматически преобразуется с использованием платформы Java, и требуемые данные из различных баз данных извлекаются, несмотря на наличие множественных расхождений, а именно семантической, синтаксической и структурной неоднородности. Другое преимущество заключается в том, что не требуется преобразование данных из нескольких баз данных. Данные находятся только в соответствующих базах данных и не преобразуются в RDF-тройки (в этом подходе RDF-тройки предопределены), что экономит много времени и места, как показано на рисунке 1.

Статья составлена следующим образом: в разделе II обсуждаются связанные работы, и комплексная аналитическая таблица (т.е. Таблица I) описывает цели статей, предлагаемые ими решения и используемые технологии. Разработка и интеграция онтологии подробно объясняются в разделе III. Результаты онтологической модели и их анализ обсуждаются в разделе IV. Раздел V суммирует вклад модели интеграции онтологии и ее преимущества.

II. СВЯЗАННЫЕ РАБОТЫ

Интеграция разнородных баз данных является проблемой для организаций и исследователей, они ищут лучшие способы интеграции без изменения исходной архитектуры баз данных. Техники, используемые для интеграции неоднородности баз данных, — это техника моделирования онтологий, построение интегрированной структуры с использованием техник интеллектуального анализа данных и федеративная техника для извлечения информации. Исследователи в основном рассматривают семантическую классификацию для интеграции разнородных структурированных данных. Следовательно, весьма вероятно, что разнородные структурированные базы данных также могут быть интегрированы с использованием семантической классификации и моделирования онтологий.

Фреймворк семантической интеграции с использованием Java-Jena API.
Рисунок 1 — Фреймворк семантической интеграции с использованием Java-Jena API.

A. СЕМАНТИЧЕСКАЯ ОНТОЛОГИЯ

В [13] авторы обсудили анализ разнородных источников данных в Big Data. Фокус исследования был на трех основных проблемах: объем данных, данные из разнородных источников и понимание взаимосвязи между различными артефактами. Исследователи используют метаданные для решения проблемы объема данных. Они предпочли семантическую веб-онтологию другим техникам для решения проблем неоднородности, потому что, по мнению авторов, семантические онтологические модели подходят для решения проблемы неоднородности. Для решения взаимосвязи между различными артефактами авторами были предложены техники искусственного интеллекта.

Верификация функциональных и нефункциональных требований к программному обеспечению является основной задачей в распределенных бизнес-процессах. Сервис-ориентированные системы предоставляют новый способ интеграции бизнес-процессов. Важной задачей является определение стоимости и надежности сервис-ориентированных систем в подходе к проектированию. Подход, обсуждающий такую проблеме, представлен в [14]–[16]. В подходе используется модель PRLTS (Probabilistic Reward Labeled Transition System) для формального представления как функциональных, так и нефункциональных требований. Во-вторых, на основе правил преобразования генерируются функциональные поведения сервисов и визуализируются с помощью инструмента визуализации Graphviz [49]–[52]. Подход также позволяет пользователям динамически изменять поведения модели. Аналогично, исследователи в [17]–[21] представили поведенческую модель для проверки согласованности данных.

В [22] обсуждается подход графического моделирования для интеграции данных из различных разнородных источников. Авторы [22] использовали Neo4j как модель графовой базы данных, но также обсудили, что семантическая онтологическая модель используется для решения проблемы неоднородности. Авторы в [23] использовали несколько разнородных источников данных, таких как онтологии, сети, унифицированные словари и реляционные базы данных, для создания интегрированной сети. В [23] разработана поисковая система на основе семантической онтологической модели и алгоритмов машинного обучения, которая позволяет пользователям запрашивать несколько источников данных. Аналогично, в [24] предложена система DBOntoLink, которая расширяет возможности языков запросов баз данных для работы с репозиториями биомедицинских онтологий. В исследовании предложен унифицированный интерфейс запросов, который поддерживает основные биомедицинские онтологии, размещенные на NCBO BioPortal.

Техники семантической веб-паутины также используются для работы с RDB, например, в [5] представлено несколько правил отображения схемы RDB для отображения RDB в семантическую веб-онтологию (которая является Framework описания ресурсов (RDF)). Правила полезны для интеграции различных разнородных баз данных.

В [25] оценены четыре различных результата для отображения RDB с использованием семантических онтологических моделей. Авторы в [25] проанализировали Jena с D2RQ, Jena с R2RML, KAON2 и OWL API. Они оценили техники на основе двух параметров:

Авторы в [25] обсудили, что Jena с R2RML эффективно отображает реляционные базы данных в онтологию, а KAON2 эффективно извлекает информацию по сравнению с другими техниками.

Помимо техник отображения, в области баз данных были предложены другие техники для решения проблемы неоднородности. Подробный обзор был представлен в [26], в обзоре обсуждается, что техники создания глобальной схемы используются для создания глобальной схемы из разнородных локальных схем. Техника создания глобальной схемы очень затратна, требует много знаний о домене и требует перепроектирования баз данных.

Другая техника, известная как преобразование запросов на основе декларативных отображений, была представлена в [27]. Эта техника использует виртуальную модель запросов, которая получает запрос от пользователя и преобразует запрос во множество локальных моделей запросов. Локальные модели выполняют запрос в соответствии со своим синтаксисом, возвращают результаты в виртуальную модель, и, наконец, виртуальная модель отображает пользователю унифицированный результат, полученный из этих локальных моделей.

В основном онтология разрабатывается на основе полей конкретных баз данных. Авторы в [28] представили схему (т.е. полуавтоматическую) для извлечения онтологии из RDB. Поэтому авторы предложили подход обратного инжиниринга, который использует язык определения данных SQL (DDL) как реляционную модель, а затем преобразует модель в семантическую онтологию. В [28] подход был реализован в две фазы. На первой фазе авторы проанализировали метаданные RDB для разработки концептуальной модели, затем разработали эквивалентную семантическую веб-онтологию соответственно. На второй фазе данные преобразуются из RDB в RDF-тройки. Недостатком является необходимость повторять фазу каждый раз для извлечения последних обновленных данных из базы данных, потому что записи базы данных очень часто обновляются. Подход очень затратен при обработке.

В [29] предложен полуавтоматический семантический веб-подход для интеграции данных из нескольких источников баз данных. Онтологическая модель создается в два шага для каждого источника данных. На начальном шаге авторы разработали онтологическую модель из SQL-DDL. На втором шаге добавляются ограничения, объектные и свойства данных для уточнения начальной онтологической модели. Ограничением [29] является то, что каждый раз при обновлении баз данных свойства типа данных в онтологических моделях должны соответствующим образом обновляться в соответствии с доменами и диапазонами. Более того, правила отображения не способны отображать ограничение первичного ключа в онтологии.

В [30] предложен набор обучающих правил для извлечения модели онтологии OWL из RDB. В подходе [30] для создания онтологической модели используются только метаданные RDB. Следовательно, никакие данные не преобразуются из базы данных в онтологию (т.е. RDF-тройки не создаются из кортежей RDB). Основная проблема подхода [30] заключается в том, что сложные правила отображения, такие как первичные и внешние ключи, не отображаются на онтологию, поскольку для создания онтологических моделей используются только метаданные баз данных. В результате из баз данных может быть извлечено только небольшое подмножество записей.

В [31] представлен подход отображения на основе глобальной схемы, где определен набор правил отображения для извлечения глобальной онтологической модели из базы данных. Подход, использованный в [31], является полуавтоматическим, требует много знаний о домене и очень трудоемок с точки зрения проектирования.

Авторы в [32], [33] представили технику, которая очень похожа на работу, представленную Astrova. [28]. Правила отображения определены для создания онтологической модели из SQL-DDL. Предлагаемый подход состоит из правил, определяющих различные способы создания классов, подклассов, свойств и ограничений. Авторы описали, что «процесс создания онтологии не является полностью автоматизированным. Существуют сложные базы данных, где автоматический подход может не работать, поэтому полуавтоматический подход может хорошо работать». Недостатком подходов [28], [32], [33] является то, что для применения правил к различным источникам данных каждый раз, по мере изменения источников данных, требуются экспертные знания домена.

В [34] обсуждается автоматический инструмент, который создает онтологию из схемы RDB. Функциональность инструмента — его способность преобразовать схему RDB в RDF. Недостатки инструмента обсуждаются авторами в [34]: во-первых, он может преобразовывать только схему, а не данные, что делает инструмент зависимым от программного инструмента, который извлекает данные. Во-вторых, инструмент теряет некоторую информация при отображении сложной RDB в RDF.

Другой автоматический подход разработки онтологии был представлен в [35]. Авторы назвали подход системой автоматической генерации онтологии (OGSRD) на основе RDB. Подход в [35] используется для автоматической разработки онтологии из RDB, но подход предоставляет ограниченную функциональность, и важные аспекты (т.е. схема) RDB не отображаются на онтологию.

B. ИНТЕЛЛЕКТУАЛЬНЫЙ АНАЛИЗ ДАННЫХ

Авторы в [40] обсудили, что алгоритмы интеллектуального анализа данных не способны обеспечить эффективное решение как для неоднородности, так и для масштабируемости носимых данных (т.е. изменяющихся данных). Авторы предложили онтологию носимого здравоохранения (WH-Ontology) для решения проблемы неоднородности. Исследование в [40] показало, что семантическая веб-онтология эффективно справляется с проблемой неоднородности и позволяет принимать более обоснованные решения, связанные со здоровьем. Авторы использовали семантическую веб-онтологию для хранения большого объема данных, генерируемых из разнородных источников, и для извлечения данных из источников данных в унифицированном формате.

C. ТЕХНИКА ИЗВЛЕЧЕНИЯ

DATA CIVILIZER [39] — это техника, предложенная в области Big Data для решения проблемы неоднородности. DATA CIVILIZER использует графовую модель для связывания данных из различных источников, затем использует модуль обнаружения данных, чтобы помочь в идентификации данных, релевантных пользователю. Подход использует поли-хранилище СУБД для выполнения фактического запроса, который федеративно обрабатывает запросы в различных системах.

В [37] представлена гибридная поисковая система, которая использует технику информационного поиска, известную как «Федеративный поиск», для интеграции данных из разнородных источников информации. В федеративном поиске запрос отправляется в множество хранилищ данных (т.е. больших объемов данных), таких как Google Search, Oracle и т.д., и данные извлекаются. Извлеченные данные из хранилищ объединяются и показываются пользователю. Используя эту технику, пользователь может одновременно запрашивать несколько разнородных баз данных. Исследователи используют метрики точности и полноты для измерения эффективности предлагаемого подхода [48]. Предлагаемая схема основана на концепции подхода глобальной схемы, в которой определяется схема или набор правил. На основе этих правила должны быть спроектированы все хранилища. Другими словами, все хранилища должны соответствовать глобальной схеме. Один из основных недостатков подхода глобальной схемы заключается в том, что хранилища не могут проектироваться независимо. Данные не могут быть извлечены из любого источника данных, который не был спроектирован на основе глобально определенных правил. Другой основной недостаток федеративного поиска заключается в том, что он не может справляться с проблемой семантической неоднородности, потому что федеративный поиск не предназначен для решения проблемы семантической неоднородности. Федеративный поиск основан на подходе преобразования запросов, поэтому запрос применяется к атрибутам таблиц в базах данных. Если заголовки атрибутов различны, но значения одинаковы, то федеративный поиск не может одновременно извлекать фактические результаты из нескольких баз данных, в то время как семантическая онтология эффективно работает в таких случаях, как обсуждается в разделе III.

ТАБЛИЦА 1. Аналитическое описание обзора литературы.
Цитируемые статьи Цели Метрика Предлагаемое решение Используемые техники
2016 [5]Семантическая интеграция множественных разнородных источников.Точность и полнота.Полуавтоматический подход для преобразования данных (RDB в RDF).Семантическая веб-паутина и моделирование онтологий.
2016 [13]Цифровой криминалистический анализ.Общее сокращение данных и время, необходимое для связывания данных из разнородных источников данных.Мультидисциплинарный подход (использование метаданных, семантической онтологии и искусственного интеллекта).Семантическая веб-паутина и искусственный интеллект.
2016 [22]Сокращение неоднородности схемы.Лаконичность и связность графа.Графовая модель и подход глобальной схемы.Big Data.
2017 [23]Интеграция медицинских данных из множественных разнородных источников.Вероятность перезапуска, ложноположительные и истинно положительные.SLN-SRW (Simplified Laplacian Normalization-Supervised Random Walk).Семантическая веб-паутина и машинное обучение.
2015 [25]Сравнительный анализ современных инструментов для отображения реляционной базы данных в онтологию.Время, необходимое для отображения реляционной базы данных в онтологию и ее эффективность.Решение не предложено, только сравнительная оценка.Семантическая веб-паутина, время отображения онтологии.
2001 [27]Интеграция разнородных биомедицинских баз данных.Эффективность запросов и скорость извлечения данных.Полуавтоматическая схема преобразования запросов.Базы данных, биомедицинская информатика.
2004 [28]Обратный инжиниринг RDB в онтологию.Общее время отображения и его эффективность.Обратный инжиниринг, полуавтоматический подход и подход преобразования данных.Семантическая веб-паутина, моделирование онтологий.
2005 [30]Наполнение семантической веб-онтологии из RDB.Общее время отображения.Полуавтоматический подход и преобразование запросов.Семантическая веб-паутина, время отображения онтологии.
2006 [31]Правила отображения для отображения реляционной модели в OWL.Точность и время отображения.Полуавтоматическое преобразование данных.Семантическая веб-паутина, автоматическое отображение онтологии.
2011 [33]Расширение RDB для поддержки семантических веб-запросов.Эффективность расширения и эффективность запросов.Прямое отображение.Технология семантической веб-паутины.
2010 [34]Преобразование RDB в семантическую веб-онтологию.Общее время преобразования и точность.Автоматический подход и преобразование запросов.Моделирование онтологий и приложение запросов.
2011 [35]Автоматическая генерация онтологии из базы данных.Эффективность времени генерации онтологии.Автоматический подход.Семантическая веб-паутина, автоматическое моделирование онтологий.
2017 [36]Сокращение семантической неоднородности.Эффективность интеграции и интероперабельность.Semantic Big Data Historian (SBDH) и подход глобальной схемы.Кибер-физические системы, Bigdata и семантическая веб-паутина.
2016 [37]Платформа, позволяющая пользователям искать интегрированные данные из нескольких источниковПолнота и точность.Fuissen (гибридная поисковая платформа) и подход глобальной схемы.Глубокий веб и связанные данные.
2015 [38]Обработка информации из нескольких источников.Основной вертикальный CTR и вторичный вертикальный CTR.Подход, управляемый данными.Информационный поиск и машинное обучение.
2017 [39]Интеграция данных из множественных источников данных.Время, необходимое для поиска, подготовки и анализа данных.DATA CIVILIZER и подход глобальной схемы.Система управления Big Data.
2015 [40]Решение проблемы неоднородности и масштабируемости в носимых устройствах здоровья.Время, необходимое для извлечения данных из разнородных ресурсов данных и его масштабируемость.Архитектура семантических больших данных на основе «Knowledge as a Service», онтология носимого здравоохранения и подход преобразования запросов.Носимая вычислительная техника, Big Data и технология семантической веб-паутины.
2014 [41]Экспорт содержимого RDB в графы RDF.Эффективность времени экспорта.R2RML.Веб-интеллект, интеллектуальный анализ данных и семантика.
2008 [42]Преобразование SQL RDB в модели онтологий OWL.Эффективность общего времени отображения.OWL API.Метаданные и семантические исследования.
2006 [43]Сравнение и техники рассуждения для запросов DL.Эффективность запросов и точность.KAON2.Искусственный интеллект и рассуждения.
2004 [44]Рассмотрение RDB как виртуальных графов RDF.Полнота и полнота.D2RQ.Технология семантической веб-паутины.
2014 [53]Автоматическое отображение разнородных RDB с онтологиями.Используется единая онтология (т.е. концепция верхней онтологии).Множественные онтологии объединены в одну онтологию.Инженерия онтологий.
2009 [54]Решение проблем, связанных с запросами к RDB.Для интеграции запросов используются шаблоны SPARQL.Для интеграции запросов схема RDB моделируется в онтологии.Шаблоны SPARQL и моделирование онтологий.
2003 [55]Интеграция схем RDB одного домена, имеющих одинаковые поля, но разные отношения.Семантическое моделирование для решения семантической неоднородности.Для решения отношений полей между базами данных используются семантические графы.Инженерия онтологий.
2014 [56]Интеграция баз данных, где данные не централизованы и имеют вариации схемы.Семантическое моделирование для решения проблемы.Онтологические модели интегрируют данные, имеющие вариации схему.Инженерия онтологий.
2009 [57]Интеграция трех разнородных групп баз данных для временных меток.Сконструирована онтологическая модель.Семантическая онтологическая модель решает проблему репликации данных во временных метках.Моделирование онтологий.
2010 [58]Интеграция схем RDB одного домена, разработанных в SQL Server, Oracle и т.д.Используется семантическая онтологическая модель.Смоделирована онтология для решения семантических и структурных конфликтов схемы RDB.Моделирование онтологий.

D. НЕДОСТАТКИ В СООТВЕТСТВИИ С НАШИМ ПОДХОДОМ

В статье [28] авторы использовали методы семантической онтологии для проведения обратного инжиниринга с целью извлечения ER-диаграмм и объектных моделей из существующих реляционных баз данных. Авторы проанализировали отношения данных и сконструировали онтологическую модель. Следовательно, их модель основана на RDB базе данных веб-приложений. В статьях [30, 31] авторы определили набор правил семантического языка, которые изучают RDB и автоматически моделируют онтологию. Их фокус на автоматической системе, которая может визуализировать RDB в онтологической модели. Автоматическая система может проектировать онтологию только для баз данных RDB. В статье [31] авторы предложили полуавтоматическую систему, а в [30] авторы предложили автоматическую систему. В статье [33] представлена DLDB, которая является расширением DAML+OIL онтологии на основе RDB, т.е. только баз данных MS-Access. Автор использовал механизм рассуждений и определил логику описаний, чтобы предоставить решение для сложности базы данных. В [34, 35] авторы предложили инструмент, который автоматически преобразует RDB в язык онтологии (т.е. модель). В [34] инструмент получает неявную семантику RDB для преобразования, в то время как в [35] сначала строится онтология на основе RDB, а затем экспериментируется для преобразования RDB в онтологическую модель. Статья [41] также объясняет преобразование RDB в граф, но с инкрементальным методом. Инкрементальный метод объясняет, что отображение выполняется только тогда, когда набор измерений производительности оценивается в соответствии с требованиями. В [42] авторы разработали онтологическую модель для отображения RDB с целью синхронизации SQL-запросов на распределенных базах данных. Статья [43] описывает построение логического описания RDB. Логическое описание основано на KAON2 и SHIQ, которые названы ABoxes. В то время как в [44] авторы реализовали D2RQ, который разработан из RDB, и SQL-запросы моделируются в графе RDF.

Недостатками работ [28, 30, 31, 33, 34, 35, 41, 42, 43, 44] является отсутствие интеграции структурированных и неструктурированных данных из различных баз данных. Цели и метрики этих ссылок объясняют, что они фокусируются только на одном домене базы данных, но структуре, т.е. RDB. В то время как наша работа интегрирует RDB (т.е. структурированные) и полу-RDB (т.е. полуструктурированные) или не-RDB (т.е. полностью неструктурированные) базы данных.

Статья [53] описывает автоматическое отображение онтологий из различных разнородных RDB. Авторы представили решение для разнородных баз данных RDB, но не имеют дело с неструктурированными базами данных, где возникает синтаксическая проблема. Синтаксическая проблема рассматривается в разделах III и V. Статья [54] обсуждает проблемы, связанные с запросами, для интеграции реляционных баз данных. Авторы предположили, что графовые шаблоны SPARQL дают тот же принцип для отображения реляционной схемы с использованием онтологии RDF. Автор представил, что их работа оптимизирует запросы к базе данных с использованием SPARQL-запросов, где первичные ключи и другие поля отображаются с онтологической моделью. Статья [55] обсуждает интеграцию баз данных, но с аналогичным доменом и аналогичными именами полей/столбцов. Проблема, обсуждаемая в [55], фокусируется на проблеме семантической неоднородности, которая подробно объясняет содержательную неоднородность, где базы данных имеют некоторые данные и почти одинаковые имена полей, но отношения разные. Авторы сконструировали онтологическую модель для двух различных баз данных соответственно, чтобы решить только структурную неоднородность. В статье [56] авторы обсуждают свой проект по интеграции баз данных, где данные периодически представляются на различных терминалах. Эффективность методологии заключается в использовании простых SPARQL-запросы для извлечения данных без использования сложных запросов к базе данных, поэтому решается только проблема семантических запросов. Статья [57] обсуждает три различные группы разнородной и однородной репликации данных в СУБД. Эти группы описывают временные метки СУБД, когда выполняется любой тип обновления, изменения, модификации и/или доступа к СУБД. Авторы в статье [57] использовали семантические онтологические модели для решения проблемы репликации данных при установке временных меток в СУБД. В другой статье [58] поддерживается наша методология, что онтология верхнего уровня (т.е. Корневая онтология в нашей статье) устраняет конфликты и неопределенность при отображении онтологий. Также упоминается в статье [58], что их онтология решает семантические и структурные конфликты. Статья [59] обсуждает полуавтоматическое отображение структурированной RDB на онтологию, но только для баз данных традиционной китайской медицины. В [60] авторы предложили иерархическую онтологическую модель для отображения извлеченных признаков структурированной RDB в модель RDF. Статья [61] представляет собой обзорный отчет, который способствует интеграции RDB в технологию семантической веб-паутины RDF. Вклад описывается как около 0,33% подходов, которые неуспешны при отображении онтологии либо автоматически, либо полуавтоматически.

Наш подход может решить синтаксический конфликт, а также семантический и структурный конфликт, потому что он фокусируется на неструктурированных базах данных, а также на RDB, где большинство проблем возникает в именах полей, как обсуждается в разделе III, что схожие записи ведутся под разными полями, где имена полей не совпадают. Проблема по сравнению с нашей методологией заключается в том, что статьи [53]–[60] используют онтологическую модель для RDB. В то время как мы предложили методологию для построения пошаговой онтологической модели, которая может быть легко интегрирована с различными другими реляционными и/или неструктурированными базами данных. Используя наш метод, корневая онтология может быть расширена для других схожих проблем баз данных, что невозможно с [53]–[60]. Новизна нашей методологии заключается в корневой онтологии, которая интегрирует совершенно разные базы данных, т.е. реляционные и неструктурированные базы данных. Наша методология также решает синтаксическую проблему, т.е. с разными именами полей в разных базах данных, но данные в полях содержательно схожи. Наша работа основана на подходе, представленном в [35].

Техники интеграции разнородных источников данных очень хороши, и они используются в известных приложениях. Например, LinkedIn и метапоисковые системы используют федеративный поиск, но у этих техник есть некоторые ограничения, обсуждаемые в разделе II.C, втором абзаце.

В нашей статье в разделе V обсуждаются три проблемы неоднородности, а именно семантическая, структурная и синтаксическая (т.е. именования) неоднородность. Согласно обсуждению в разделе II, проблема решается путем предложения семантического веб-подхода для улучшения техник поиска [38]. Следовательно, раздел II объясняет, что семантическая веб-онтология предоставляет лучшее решение для проблемы неоднородности. Аналитическое обсуждение подробно изложено в Таблице I. Статьи, представленные как аналитическое обсуждение в Таблице I, не обсуждают проблему синтаксической неоднородности, которая возникает во время интеграции данных между разнородными базами данных.

III. РАЗРАБОТКА И ИНТЕГРАЦИЯ ОНТОЛОГИИ

Семантическая веб-онтология предоставляет решение для интеграции разнородных баз данных, как обсуждается в разделе II. Следовательно, методология обсуждается в разделе III. Методология разработки онтологии и интеграции базы данных состоит из трех основных фаз: 1) построение онтологии из RDB, 2) интеграция онтологии, 3) доступ к данным из разнородных баз данных на основе интегрированных онтологических моделей. Изначально RDB отображаются в онтологическую модель на основе правил отображения онтологии, обсуждаемых в разделе III.A. На начальной фазе разрабатываются две онтологические модели в соответствии с двумя различными библиотечными базами данных. На второй фазе создается корневая онтология на основе двух разработанных онтологических моделей. Корневая онтология — это абстрактная онтологическая модель онтологий, разработанных на начальной фазе. Затем начальные модели интегрируются с корневой онтологией. Наконец, интегрированные онтологические модели используются для одновременного доступа к данным из разнородных баз данных. Различные инструменты, такие как TODE (инструмент для разработки и редактирования онтологий), Protégé и Jena API в Java Eclipse, могут использоваться для разработки и редактирования онтологических моделей. TODE — один из самых ранних инструментов разработки онтологий на основе Dot Net. TODE предоставляет большинство функций, таких как рассуждения, интерфейсирование, редактирование, разработка и визуализация, но поддерживает только OWL-Lite [47]. Protégé, с другой стороны, предоставляет все вышеупомянутые функции и, кроме того, поддерживает OWL DL и OWL Full. На основе этих исключений в TODE онтологические модели создаются с использованием Protégé и Jena API в Java Eclipse. Java Eclipse используется только для GUI-интерфейса, если мы не используем Java Eclipse для Protégé, то те же запросы будут применяться вручную в Protégé для извлечения ответов, а также для обновления онтологии на любом уровне, что будет делаться вручную. Наша методология эффективна для доступа к данным с использованием семантических техник из нескольких разнородных баз данных одновременно или в соответствии с требованием.

Библиотечные базы данных — это базы данных реального времени, полученные из двух различных университетов. Оба университета используют интегрированные системы управления библиотечными базами данных (ILS) для управления своими записями. ILS первого университета реализована с использованием SQL Server, и используется схема RDB (т.е. Библиотека-A), как показано на рисунке 2. ILS второго университета основана на MySQL (бэкенд KOHA) для управления ILS, но схема RDB не используется (т.е. Библиотека-B). Следовательно, отношения между таблицами в Библиотеке-B не были определены, Библиотека-B состоит из неструктурированной базы данных. Обе ILS используют различные схемы управления базами данных для хранения схожей информации о книгах, студентах, персонале и других связанных сущностях, но данные по своей природе разнородны.

A. РАЗРАБОТКА ОНТОЛОГИИ

Концептуальная модель обеих баз данных и онтологии довольно схожа. Базы данных имеют набор статических и динамических атрибутов, но только статические особенности баз данных отображаются на семантическую онтологию из-за ограничений онтологии. Статические особенности баз данных включают таблицы, столбцы, строкы, отношения, ограничения целостности, первичные ключи и внешние ключи. Преобразование RDB в онтологию — это прямой процесс, и сложные случаи преобразования редко возникают во время преобразования. Для построения онтологических моделей из RDB используются два набора правил, как обсуждается далее.

1) ПРОСТЫЕ ПРАВИЛА ПРЕОБРАЗОВАНИЯ

RDB преобразуются в онтологическую модель путем отображения таблиц базы данных как классов онтологии, первичные ключи, не первичные ключи и не внешние ключи отображаются как свойства данных класса. Каждое свойство данных имеет соответствующее имя таблицы в качестве своего домена и эквивалентный SQL тип данных XML Schema в качестве своего диапазона. Таблица 2 показывает эквивалентные SQL типы данных XML Scheme (xsd).

Таблица 2 показывает простые правила преобразования для отображения баз данных с типами данных онтологии. Для отображения сложных функций, таких как отношения, первичные и внешние ключи, используются правила отображения, предложенные авторами в [41], соответственно. Тот же метод применяется к обеим базам данных для генерации двух отдельных локальных онтологических моделей (по одной для каждой

Реляционная схема базы данных Библиотека-A.
Рисунок 2 — Реляционная схема базы данных Библиотека-A.

2) СЛОЖНЫЕ ПРАВИЛА ПРЕОБРАЗОВАНИЯ

При преобразовании RDB в RDF-онтологию отношение «многие ко многим» в RDB разрешается путем нормализации (т.е. введения другой таблицы). Следовательно, из-за нормализации сущности (т.е. имена полей в RDB) повторяются. Повторение сущностей невозможно в онтологии, потому что в онтологии класс является URI, который должен быть уникальным. Следовательно, для решения таких проблем используются следующие техники, которые объясняются на примерах.

Таблицы баз данных из обеих библиотек отображаются в классы онтологии соответственно, за исключением соединительных таблиц, которые используются для соединения двух таблиц в случае отношения «многие ко многим». Например, таблицы Author и Book на рисунке 2 имеют отношение «многие ко многим».

Если две таблицы имеют отношение «многие ко многим» в базах данных, то отношение делится на отношения «один ко многим» и «многие к одному» с использованием третьей таблицы. Из рисунке 2 видно, что таблица Author_Book используется для связи родительских таблиц (Author и Book). Первичные ключи обеих родительских таблиц используются как внешние ключи в таблице Author_Book. Следовательно, таблицы Author_Book, Library_book и Subject_book не отображаются в классы онтологии, потому что имена полей уже отображены как классы в онтологии. Это также потому, что в онтологиях нет необходимости в поддержании мощности отношений.

Таблицы базы данных, атрибуты которых одновременно являются первичным ключом и внешним ключом, делаются подклассами тех классов, чьи первичные ключи используются как внешние ключи. Рисунок 2 показывает две такие таблицы. Таблицы Staff и Student имеют первичные ключи (т.е. StaffID и Column0 соответственно), которые одновременно также являются внешними ключами. Следовательно, эти таблицы сделаны подклассами класса Person в онтологии, потому что первичный ключ (т.е. NIC) таблицы Person используется как внешний ключ (т.е. StaffID и Column0) в обеих таблицах. Соединительные таблицы базы данных, используемые для отношений «многие ко многим», отображаются в объектные свойства в RDF-онтологии. Например, Library_book — это соединительная таблица, как показано на рисунке 2, которая используется для соединения таблиц Library и Book, имеющих отношение «многие ко многим». Следовательно, в онтологии определяются два объектных свойства «has_book» и «book_available_in_library» в онтологической модели для решения проблемы отношения «многие ко многим». Первое объектное свойство (т.е. «has_book») имеет класс «Library» в качестве своего домена и класс «Book» в качестве своего диапазона. Тогда как второе свойство (т.е. «book_available_in_library») используется как обратное объектное свойство. Следовательно, класс «Book» как домен, и класс «Library» как его диапазон. Рисунок 3 показывает онтологическую модель базы данных Библиотеки-A, созданную с использованием этих правил. Тот же набор правил применяется к онтологии Библиотеки-B. Онтологическая модель Библиотеки-B показана на рисунке 4. База данных Библиотеки-B является неструктурированной базой данных, следовательно, между сущностями нет отношений. Следовательно, онтологическая модель Библиотеки-B имеет только классы со свойствами данных.

ТАБЛИЦА 2. Эквивалентные SQL типы данных XSD.
SQL тип XSD тип
BigIntxsd: long
Binaryxsd: base64Binary
Bitxsd:Boolean
Charxsd:string
DateTimexsd:dateTime
Decimalxsd:decimal
Floatxsd:double
GUIDxsd:string
Imagexsd:base64Binary
Intxsd:int
Moneyxsd:decimal
NCharxsd:string
NTextxsd:string
Numericxsd:decimal
NVarCharxsd:string
Realxsd:float
SmallIntxsd:short
SmallDateTimexsd:dateTime
SmallMoneyxsd:decimal
Sql_Variantxsd:anyType
Textxsd:string
TimeStampxsd:base64Binary
TinyIntxsd:unsignedByte
UDT (CLR style)xsd:base64Binary
VarBinaryxsd:base64Binary
VarCharxsd:string
XMLxsd:any
XML (typed)xsd:any
Онтологическая модель Библиотеки-A.
Рисунок 3 — Онтологическая модель Библиотеки-A.

B. ИНТЕГРАЦИЯ ОНТОЛОГИИ

Интеграция онтологии — это вторая фаза нашей методологии. Корневая онтология создается на второй фазе с использованием Protégé на основе знаний домена библиотек и показана на рисунке 5. Корневая онтология состоит из набора общих классов онтологической модели Библиотеки-A и онтологической модели Библиотеки-B, как показано на рисунке 3 и рисунке 4 соответственно. Основная цель корневой онтологии — интегрировать онтологические модели, созданные на фазе-1. Чтобы интегрировать корневую онтологию с онтологическими моделями фазы-1, корневая онтология импортируется отдельно в разные онтологии для Библиотеки-A и Библиотеки-B с использованием Protégé. После импорта выполняются следующие шаги для интеграции онтологических моделей Библиотеки-A и Библиотеки-B:

Онтологическая модель Библиотеки-B.
Рисунок 4 — Онтологическая модель Библиотеки-B.
Корневая онтология.
Рисунок 5 — Корневая онтология.
Интегрированная онтологическая модель Библиотеки-A на фазе-2.
Рисунок 6 — Интегрированная онтологическая модель Библиотеки-A на фазе-2.
Интегрированная онтологическая модель Библиотеки-B на фазе-2.
Рисунок 7 — Интегрированная онтологическая модель Библиотеки-B на фазе-2.
SPARQL-запрос для отображения Книги автора
Рисунок 8 — SPARQL-запрос для отображения Книги автора "Alan Simpson".
SPARQL-запрос для отображения имени дистрибьютора Книги.
Рисунок 9 — SPARQL-запрос для отображения имени дистрибьютора Книги.

Фаза интеграции основана на двух онтологических моделях. Эти модели называются онтологическими моделями фазы-2, как показано на рисунке 6 и рисунке 7. Чтобы понять отношения и роли классов и индивидов, используемых в онтологических моделях (на фазе-2), логики описаний обеих онтологических моделей предоставлены в таблице 3 и таблице 4. Например, логика описаний Author ⊆ Book объясняет, что у Книги есть Авторы; автор может быть один или много, как показано в таблице 3 и таблице 4. Логика описаний описывает благоприятные компромиссы между выразительностью и масштабируемостью корневой онтологии. Следовательно, та же корневая онтология (т.е. представленная в этой статье) может быть расширена для других моделей баз данных библиотек с небольшими изменениями. Как показано в таблице 3 и таблице 4, имена классов и отношения онтологических моделей для Библиотеки-A и Библиотеки-B теперь схожи на фазе-2, которые были различны на онтологических моделях фазы-1. Правила и логическое описание таблицы 3 и таблицы 4 основаны на базах данных Библиотеки-A и Библиотеки-B соответственно. Схожесть классов и их отношений в двух онтологических моделях библиотек необходима для применения семантически схожих SPARQL-запросов для извлечения данных из обеих баз данных. Единственное различие — объектные свойства обеих онтологических моделей, которые не схожи, потому что структура и схема обеих баз данных различны. Следовательно, в процедуре (экспериментированной в этой статье) данные баз данных не преобразуются, а вместо этого используется техника преобразования запросов. Преобразование запросов более целесообразно в случае предоставления пользователям последних обновленных данных по сравнению с преобразованием данных.

Интеграция онтологии является важной фазой нашего исследования. Благодаря фазе интеграции (т.е. фазе-2) проблемы семантической, синтаксической и структурной неоднородности удаляются из онтологических моделей на основе правил, обсуждаемых в пунктах раздела III.B. Результаты интегрированных онтологических моделей фазы-2 семантически схожи в большей степени, потому что схожие SPARQL-запросы применяются к обеим моделям для извлечения результатов из разнородных баз данных Библиотеки-A и Библиотеки-B.

C. СХЕМА ПРЕОБРАЗОВАНИЯ ЗАПРОСОВ

Преобразование запросов — последний шаг. Для реализации преобразования используется Jena API в Java Eclipse. Следовательно, в Java Eclipse используются драйвер JDBC «mysql.jdbc» для MySQL и «sqljdbc» драйвер для SQL Server. Jena API используется в Java для создания или манипулирования графами RDF. Онтологические модели уже созданы в Protégé; следовательно, онтологические модели используются только для применения SPARQL-запросов с использованием Jena API. Различные пакеты Jena API, такие как класс «OntModel» для преобразования онтологической модели, «структура данных запроса» для создание SPARQL-запроса, интерфейс «выполнения запроса» для выполнения SPARQL-запроса, используются на фазе преобразования.

Результаты Библиотеки-A.
Рисунок 10 — Результаты Библиотеки-A.
Результаты Библиотеки-B.
Рисунок 11 — Результаты Библиотеки-B.
Результаты из обеих, т.е. Библиотеки-A и Библиотеки-B.
Рисунок 12 — Результаты из обеих, т.е. Библиотеки-A и Библиотеки-B.

Для извлечения данных из баз данных MySQL и SQL Server используются драйверы «mysql.jdbc» и «sqljdbc». Устанавливаются соединения с соответствующими базами данных. SPARQL-запросы категоризируются в соответствии с нативными запросами базы данных. Запросы выполняются, и результаты собираются из баз данных для отображения пользователю. Пользователю предоставляются три различные функциональные возможности, с помощью которых пользователь может запрашивать базы данных Библиотеки-A или Библиотеки-B независимо или одновременно, как показано на рисунке 10, рисунке 11 и рисунке 12.

IV. АНАЛИЗ И РЕЗУЛЬТАТЫ

Вклад исследования заключается в интеграции разнородных баз данных на единой платформе (т.е. предлагаемой онтологической модели) без изменения структуры и схемы существующей базы данных. Для выполнения задачи выбраны фактические библиотечные базы данных из двух университетов. После анализа обеих баз данных стало ясно, что обе базы данных хранят схожую информацию, но структура, схема, техническое именование полей баз данных, семантически и синтаксически различны. Система управления Библиотекой-A была реализована в SQL Server и является RDB. База данных Библиотеки-B не является RDB, и информация избыточна в таблицах. В Библиотеке-B нет первичных или внешних ключей в базе данных, что является основной причиной репликации данных.

Некоторые основные различия между обеими базами данных были идентифицированы во время исследования, например, 1) Технические различия: база данных Библиотеки-A реализована в SQL Server, а Библиотеки-B реализована в MySQL. 2) Структурные различия: база данных Библиотеки-A имела внешние ключи, т.е. отношения с другими таблицами, а база данных Библиотеки-B не имела отношений. 3) Семантические и синтаксические различия: таблицы в обеих базах данных хранят схожую информацию о книгах, студентах и т.д., но способ, которым они хранят информацию, совершенно различен. Например, для хранения информации об имени автора; Библиотека-A использует «t68AuthorName» как имя столбца, в то время как Библиотека-B использует столбец «Author» для хранения той же информации. Репликация данных — еще одна серьезная проблема, с которой столкнулись в базе данных Библиотеки-B.

Знания домена и правила отображения, обсуждаемые в разделе III, используются для построения онтологических моделей. SPARQL-запросы применяются к онтологическим моделям для проверки результатов явной информации в соответствии с наборами данных.

SPARQL-запросы, показанные на рисунке 8 и рисунке 9, применяются к онтологическим моделям. Например, для извлечения информации о книгах, чье имя автора — «Alan Simpson», как показано на рисунке 8. Аналогично, для извлечения названия Книги, чей дистрибьютор — «Pak_Book_Corporation», SPARQL-запрос, как показано на рисунке 9.

Преимущество нашей методологии — легко интегрировать любую другую базу данных библиотеки, кроме расширения (т.е. импорта) корневой онтологии. Интегрированные онтологические модели называются онтологическими моделями фазы 2. Онтологические модели фазы 2 валидируются с использованием SPARQL-запросов. Таблица 5 показывает другие шесть SPARQL-запросов, используемых для извлечения схожей информации из онтологических моделей. Есть еще SPARQL-запросы, которые используются для извлечения информации. Таблица 5 предоставляет полную информацию о нашей работе для ответа на синтаксическую неоднородность.

При проектировании базы данных редко случается, что правила не соблюдаются, и база данных проектируется в соответствии с требованиями, поэтому база данных содержит неоднозначную информацию. Следовательно, автоматическое отображение базы данных в онтологию невозможно. Различные подходы предложены авторами для отображения базы данных в онтологию, как показано в таблице 6, но в основном они полуавтоматические. Таблица 6 также показывает сравнение между существующими подходами и нашим подходом. Поля, используемые для сравнения подходов: тип преобразования, преобразование типа данных SQL, отображение RDB в RDF, тип источника данных и используемый язык онтологии.

Для проверки результатов разработано приложение с использованием языка Java. SPARQL-запросы, показанные в таблице 5, используются в Java-приложении, SPARQL-запросы выбираются в соответствии с требованиями пользователя, как показано на рисунках с 10 по 12. Рисунки с 10 по 12 основаны на втором SPARQL-запросе, показанном в таблице 5, на этих рисунках источник (т.е. библиотеки) выбирается из выпадающего меню (т.е. Select Sources на рисунках с 10 по 12) для проверки выходных данных.

Приложение предоставляет пользователю три различных способа, т.е. извлечь данные из Библиотеки-A, извлечь данные из Библиотеки-B и если пользователь хочет одновременно искать что-либо в обеих библиотеках. Как показано на рисунке 10, пользователь ищет книгу в домене «Науки о Земле» только из Библиотеки-A или, как показано на рисунке 11, ищет в Библиотеке-B. Рисунок 12 показывает, что пользователь ищет тот же запрос в обеих библиотеках одновременно. Преимущество исследовательской работы — масштабируемость, т.е. пользователь может искать в обеих библиотеках один и тот же запрос без перестройки интегрированной базы данных или техник преобразования данных. Исследовательская работа классифицирует схожую полевую информацию из разнородных баз данных одного домена в концепт (который является знанием домена согласно построению онтологии), и схожие классифицированные поля баз данных используются в SPARQL-запросах для поиска данных соответственно. Подобный подход может быть использован для интеграции других схожих баз данных со структурированными разнородными базами данных. Следовательно, корневая онтология масштабируема и гибко используется для любой другой библиотечной базы данных.

V. ЗАКЛЮЧЕНИЕ

В разделе I обсуждается, что существует две возможности для интеграции разнородных баз данных, т.е. преобразование данных

ТАБЛИЦА 5. SPARQL-запросы, примененные к онтологическим моделям.
Описание запроса Онтологическая модель Библиотеки A фазы 2 Онтологическая модель Библиотеки B фазы 2
Показать название книг, цена которых меньше 1000 рупий. SELECT ?book?price WHERE {
?book ex:t02Price?price FILTER?(price<1000) }
SELECT ?book?price WHERE {
?book ex:PRICE?price FILTER?(price<1000) }
Показать название книг, заголовок которых "Semantic Web" SELECT ?book WHERE {
?book ex:t02Title "Semantic Web"^^xsd:string }
SELECT ?book WHERE {
?book ex:TITLE "Semantic Web"^^xsd:string }
Показать название книги, заголовок которой "Semantic Web" и издание "Second" SELECT ?book?edition WHERE {
?book ex:t02Title "Semantic Web"^^xsd:string. ?book ex:t02Edition?edition FILTER?(edition="second"^^xsd:string) }
SELECT ?book?edition WHERE {
?book ex:TITLE "Semantic Web"^^xsd:string. ?book ex:EDITION?edition FILTER?(edition="second"^^xsd:string) }
Показать список книг, которые были опубликованы в 2000 году. SELECT ?book WHERE {
?book ex:t02DatePublished "2000"^^xsd:decimal. }
SELECT ?book WHERE {
?book ex:YEAR "2000"^^xsd:decimal. }
Показать список книг, которые были опубликованы в "Pakistan" SELECT ?book WHERE {
?book ex:t02PublishPlace "Pakistan"^^xsd:string. }
SELECT ?book WHERE {
?book ex:PLACE "Pakistan"^^xsd:string. }
Показать список книг, язык которых "English" SELECT ?book WHERE {
?book ex:t02Language "English"^^xsd:string. }
SELECT ?book WHERE {
?book ex:LANGUAGE "English"^^xsd:string. }
ТАБЛИЦА 6. Сравнение предлагаемого подхода с существующими подходами.
Подход Тип преобразования Преобразование типа данных SQL Отображение RDB в RDF Тип источника данных Язык онтологии
[45]Преобразование данныхxsd:datatypesСложноеРазнородная база данных материаловеденияOWL
[46]Преобразование запросовxsd:datatypesПростоеРазнородная база данных материаловеденияOWL
[36]Преобразование данныхНе применимоНе указаноКибер-физические системыOWL
[27]Преобразование запросовНе определеноНе указаноБиомедицинские разнородные базы данныхНе указано
[40]Преобразование данныхxsd:datatypesНе указаноНосимые устройства, Базы данныхRDF
Наша методологияПреобразование запросовxsd:datatypesСложноеМножественные разнородные системы баз данныхOWL

Схема и Схема преобразования запросов, обе техники имеют свои преимущества и недостатки в зависимости от природы баз данных. Для приложений реального времени предпочтительна схема преобразования запросов, тогда как для приложения, где важна эффективность, предпочтительна схема преобразования данных. Базы данных в основном проектируются на основе знаний домена проектировщика, и проектировщики редко следуют правилам, поэтому схема базы данных может содержать неоднозначную информацию. Следовательно, онтологические модели полуавтоматически заполняются с использованием Java для интеграции разнородных баз данных. Онтологическая модель основана на технике преобразования запросов, потому что обработка онтологической модели менее затратна по времени по сравнению с общими базовыми техниками преобразования запросов приложения. Помимо эффективности обработки с использованием онтологии, корневая онтология расширяема в соответствии с требованиями для интеграции других библиотечных баз данных. Представленная методология требует небольших изменений в корневой онтологии, если база данных обновляется новыми полями. Эта полуавтоматическая система требует включения нового класса в онтологию после импорта корневой онтологии; если и только если требуемый класс отсутствует в корневой онтологии, в противном случае будет использоваться тот же класс из корневой онтологии, что было не возможно согласно [28], [29]. Наша методология также эффективно отображает первичные и внешние ключи в моделировании онтологии, что было невозможно согласно [21]. Следовательно, наша методология эффективно работает для интеграции онтологии содержательно (т.е. семантически), записи извлекаются с использованием запросов соответственно и корректно (т.е. структурно), и имена полей таблиц идентифицируются уникально для успешного извлечения информации (т.е. синтаксически).

SPARQL, основанный на языке правил SPARQL, представляет результаты. SPARQL интегрирует базы данных с использованием Jena API для извлечения результатов из баз данных соответственно. Пошаговое объяснение способствует построению онтологии для интеграции любых схожих баз данных со структурной неоднородностью, как обсуждается в разделе III B. Проверка онтологических моделей основана на входных данных и выходных результатах, когда результаты не соответствуют предоставленным наборам данных, то модель неверна, как обсуждается в разделе IV. Правила SPARQL, показанные в таблице 3 и таблице 4, извлекают требуемую информацию в обеих или в любой из баз данных, как показано на рисунках с 10 по 12). Правила реализованы на основе требований извлечения информации из баз данных.

Как обсуждается в разделе IV, корневая онтология может быть масштабируема путем обновления онтологии в соответствии с любой другой библиотечной базой данных и может быть интегрирована с существующими данными библиотек (т.е. Библиотеки-A и Библиотеки-B). Процедурный метод, обсуждаемый в разделе III, помогает интегрировать любые структурированные разнородные базы данных со схожими данными, поэтому метод может быть масштабируемым для различных других баз данных. Новизна подхода заключается в том, что онтология основана на схеме RDB, где решена синтаксическая неоднородность, что не использовалось в [35] при отображении онтологии с базой данных. Следовательно, как обсуждается в разделе III, отображение схемы RDB соответственно поможет в минимальном обновлении онтологии для любых других библиотечных баз данных RDB при интеграции. WordNet может быть использован для расширения подхода путем автоматического преобразования баз данных в онтологию.

Методология, представленная в этой статье, реализована в трех различных фазах. Первая фаза — отображение схемы базы данных в онтологические модели, как обсуждается в разделе III.A. Во второй фазе неоднородность удаляется путем создания общей онтологии, т.е. корневой онтологической модели, для интеграции онтологических моделей, созданных на фазе 1, обсуждается в разделе III.B. Наконец, записи извлекаются из разнородных баз данных с использованием Jena API в Java Eclipse. Шаг интеграции онтологии не является полностью автоматическим. Для полной автоматизации процесса алгоритмы машинного обучения могут быть использованы в комбинации с семантической веб-онтологией. Это только поможет найти сущности, которые относятся к одним и тем же сущностям реального мира. Интеграция алгоритмов машинного обучения с семантической веб-онтологией улучшит процесс интеграции.

ССЫЛКИ

  1. T. Berners-Lee, J. Hendler, and O. Lassila, "The semantic Web," Sci. Amer., vol. 284, no. 5, pp. 34-43, 2001. [Online]. Available: https://www.jstor.org/stable/e26059181
  2. J. G. Breslin, D. O'Sullivan, A. Passant, and L. Vasiliu, "Semantic Web computing in industry," Comput. Ind., vol. 61, no. 8, pp. 729-741, Oct. 2010, doi: 10.1016/j.compind.2010.05.002.
  3. Z. Wang, S. Xia, and Q. Niu, "A novel ontology analysis tool," Appl. Math. Inf. Sci., vol. 8, no. 1, pp. 255-261, Jan. 2014, doi: 10.12785/amis080131.
  4. Vasilecas, Olegas, Diana Bugate, and Jessica Trinkanas, "On approach for enterprise ontology transformation into conceptual model," in Int. Conf. Comput. Syst. Technologies, CompSysTech, vol. 6, 2006, pp. 1-8. [Online]. Available: https://www.cct.tsu.edu/~dayong/research/paper/vasilecas06.pdf
  5. M. A. Hazber and R. L. X. G. G. Xu, "Integration mapping rules: Transforming relational database to semantic Web ontology," Appl. Math., vol. 10, no. 3, pp. 1-21, 2016.
  6. D. Martin, M. Paolucci, S. McIlraith, M. Burstein, D. McDermott, D. McGuinness, and B. Parsia, "Optimizing semantics to Web services: The OWL-S approach," in Proc. Int. Workshop Semantic Web Services Web Process Composition, Jul. 2004, pp. 26-42, doi: 10.1007/978-3-540-30581-1_4.
  7. D. Maier, The Theory of Relational Databases, vol. 11. Rockville, MD. USA: Rockville, Comput. Sci. Press, 1953. [Online]. Available: https://core.ac.uk/download/pdf/81189451.pdf
  8. N. F. Noy, M. Sinek, S. Decker, M. Cruhezy, R. W. Fergerson, and M. A. Musen, "Creating semantic Web contents with protege-2000," IEEE Intell. Syst., vol. 16, no. 2, pp. 60-71, Mar. 2001, doi: 10.1109/5254.920601.
  9. Milo, Tova, and Sagit Zohar, "Using schema matching to simplify heterogeneous data translation," Vidb., vol. 98, pp. 24-27, Aug. 1998. [Online]. Available: https://pdfs.semanticscholar.org/159d/f105221fff66cf5e189c28639aad8302053a.pdf
  10. Krishnamurthy, Rajasekar, Raghav Kaushik, and Jeffrey F. Naughton, "XML-to-SQL Query translation literature: The state of the art and open problems," in Proc. Int. XML Database Symp., Sep. 2003, pp. 1-18, doi: 10.1007/978-3-540-39429-7_1.
  11. Ghawi, Raji, and Nadine Cullot, "Database-to-ontology mapping generation for semantic interoperability," in Proc. 3rd Int. Workshop Database Interoperability (InterDB), vol. 91, Sep. 2007, pp. 1-8. [Online]. Available: https://www.researchgate.net/ publication/228699271_Database-to-ontology_mapping_generation_for_semantic_interoperability.
  12. Ling, Haiyun, and Shufeng Zhou, "Mapping relational databases into owl ontology," Int. J. Eng. Technol., vol. 5, no. 6, pp. 4735-4740, Dec. 2013. [Online]. Available: http://pdfs.semanticscholar.org/4852/bc8abefa7f00982dd970747cbb168bpec06.pdf.
  13. H. Mohammed, N. Clarke, and F. Li, (2016), An Automated Approach for Digital Forensic Analysis of Heterogeneous Big Data. [Online]. Available: https://www.semanticscholar.org/paper/An-Automated-Approach-for-Digital-Forensic-Analysis-Mohammed-Clarke/7fcd007298a31f003e9cdbc2b41ea94846-54146a.
  14. H. Gao, H. Miao, L. Liu, J. Kai, and K. Zhao, "Automated quantitative verification for service-based system design: A visualization transition tool perspective," Int. J. Softw. Eng. Knowl. Eng., vol. 28, no. 10, pp. 1369-1397, Oct. 2018, doi: 10.1142/S0218194018500390.
  15. H. Gao, K. Zhang, J. Yang, F. Wu, and H. Liu, "Applying improved particle swarm optimization for dynamic service composition focusing on quality of service evaluations under hybrid networks," Int. J. Distrib. Sensor Netw., vol. 14, no. 2, Feb. 2018, Art. no. 155014771876158, doi: 10.1177/1550147718761583.
  16. Y. Yin, L. Chen, Y. Xu, and J. Wang, "Location-aware service recommendation with enhanced probabilistic matrix factorization," IEEE Access, vol. 6, pp. 62815-62825, 2018, doi: 10.1109/ACCESS.2018.2877137.
  17. H. Gao, W. Huang, X. Yang, Y. Duan, and Y. Yin, "Toward service selection for workflow reconfiguration: An interface-based computing solution," Future Gener. Comput. Syst., vol. 87, pp. 298-311, Oct. 2018, doi: 10.1016/j.future.2018.04.064.
  18. H. Gao, Y. Duan, H. Miao, and Y. Yin, "An approach to data consistency checking for the dynamic replacement of service process," IEEE Access, vol. 5, pp. 11700-11711, Jun. 2017, doi: 10.1109/ACCESS.2017.2715322.
  19. H. Gao, S. Mao, W. Huang, and X. Yang, "Applying probabilistic model checking to financial production risk evaluation and control: A case study of Alibaba's Yu'e bao," IEEE Trans. Comput. Social Syst., vol. 5, no. 3, pp. 785-795, Sep. 2018, doi: 10.1109/TCSS.2018.2865217.
  20. Y. Yin, F. Yu, Y. Xu, L. Yu, and J. Mu, "Network location-aware service recommendation with random walk in cyber-physical systems," Sensors, vol. 17, no. 9, p. 2059, Sep. 2017, doi: 10.3390/s17092059.
  21. N. Konstantinou, D. Kouis, and N. Mitrou, "Incremental export of relational database contents into RDF graphs," in Proc. 4th Int. Conf. Web Intell., Mining Semantics (WIMS), 2014, p. 33, doi: 10.1145/2611040.2611082.
  22. Astrova, Irina, "Rules for mapping SQL relational databases to OWL ontologies," in Proc. Metadata Semantics, 2009, pp. 415-424, doi: 10.1007/978-0-387-77745-0_40.
  23. B. Motik and U. Sattler, "A comparison of reasoning techniques for Querying large description logic ABoxes," in Proc. Int. Conf. Logic Program. Artif. Intell. Reasoning, 2006, pp. 227-241, doi: 10.1007/11916277_16.
  24. C. Bizer and A. Seaborne, "D2RQ-treating non-RDF databases as virtual RDF graphs," in Proc. 3rd Int. Semantic Web Conf. (ISWC), Nov. 2004, pp. 11-33.
  25. S. Zhao and Q. Qian, "Ontology based heterogeneous materials database integrant and semantic Query," AIP Adv., vol. 7, no. 10, Oct. 2017, Art. no. 105325, doi: 10.1063/1.4999209.
  26. K. Cheung, J. Hunter, and J. Dreman, "MatSeek: An ontology-based federated search interface for materials scientists," IEEE Intell. Syst., vol. 24, no. 1, pp. 47-56, Jan. 2009, doi: 10.1109/MIS.2009.13.
  27. N. Islam, M. S. Siddiqui, and Z. A. Shaikh, "TODE: A dot net-based tool for ontology development and editing," in Proc. 2nd Int. Conf. Comput. Eng. Technol., vol. 6, Apr. 2010, p. 229, doi: 10.1109/ICCET.2010.5486292.
  28. D. Oguz, B. Ergene, S. Yin, G. DiKenelli, and A. Hamentrain, "Federated Query processing on linked data: A qualitative survey and open challenges," Knowl. Eng. Rev., vol. 30, no. 5, pp. 545-563, Nov. 2015, doi: 10.1017/S0269888915000107.
  29. X. Zeng, G. Xu, X. Zheng, Y. Xiang, and W. Zhou, "E-AUA: An efficient anonymous user authentication protocol for mobile IoT," IEEE Internet Things J., vol. 6, no. 2, pp. 1506-1519, Apr. 2019, doi: 10.1109/JIOT.2018.2847447.
  30. G. Xu, Y. Zhang, A. K. Sangalai, X. Li, A. Castiglione, and X. Zheng, "CSP-e2: An abuse-free contract signing protocol with low-storage TTP for energy-efficient electronic transaction ecosystems," Inf. Sci., vol. 476, pp. 505-515, Feb. 2019, doi: 10.1016/j.ins.2018.05.022.
  31. G. Xu, J. Liu, Y. Lu, X. Zeng, Y. Zhang, and X. Li, "A novel efficient MAKA protocol with desynchronization for anonymous roaming service in global mobility networks," J. Netw. Comput. Appl., vol. 107, pp. 83-92, Apr. 2018.
  32. H. Gao, W. Huang, Y. Duan, X. Yang, and Q. Zou, "Research on cost-driven services composition in an uncertain environment," J. Internet Technol., vol. 20, no. 3, pp. 755-769, 2019.
  33. H. Zhang, D. Xingchun, Z. Yuan, J. Chun, and Y. Huang, "A new approach to building ontologies from heterogeneous databases," WIT Trans. Inf. Commun. Technol., vol. 46, pp. 1037-1044, Jan. 2014, doi: 10.2495/ISME20131332.
  34. J. Wang, Z. Miao, Y. Zhang, and B. Zhou, "Querying heterogeneous relational database using SPARQL," in Proc. 8th IEEE/ACIS Int. Conf. Comput. Inf. Sci., 2009, pp. 475-480, doi: 10.1109/ICIS.2009.11.
  35. A. Buccella and A. Cechich, "An Ontology Approach to Data Integration," J. Comput. Sci. Technol., vol. 3, no. 2, pp. 62-67, Oct. 2003.
  36. H. Yan-Hao, L. Wen-Chen, L. Bai-Qing, L. Ya-Lou, Z. Xiao-Xin, and A. Ning, "The construction of power system knowledge database based on ontology theory and semantic Web technology," in Proc. Int. Conf. Power Syst. Technol., Oct. 2014, pp. 1760-1764, doi: 10.1109/POWER-CON.2014.6939506.
  37. A. F. Nejad, S. Khrazrani, S. Bayati, S. K. Golmohammadi, and H. Abolhassani, "Semantic log based replication model for optimizing heterogeneous DBMS interaction," in Proc. 1st Int. Conference Adv. Databases, Knowl., Data Appl., 2009, pp. 138-142, doi: 10.1109/DBKDA.2009.24.
  38. J.-Y. Tao, Q.-F. Juan, and W.-H. Juan, "Ontology-based research on heterogeneous database semantic integration strategies," in Proc. 2nd Int. Workshop Edu. Technol. Comput. Sci., 2010, pp. 477-480, doi: 10.1109/ETCS.2010.535.
  39. C.-H. Liao, G.-Y. Xiong, and C.-L. Chen, "Research on OWL ontology learning method based on relational schema," in Proc. 2nd Int. Conf. Modeling, Simulation, Optim. Technol. Appl. (MSOT), Nov. 2018, pp. 159-164, doi: 10.12783/dtcsc/msota2018/27522.
  40. C.-H. Liao, Y.-F. Wu, and G.-H. King, "Research on learning OWL ontology from relational database," J. Phys., Conf. Ser., vol. 1176, Mar. 2019, Art. no. 022031, doi: 10.1088/1742-6596/1176/2/022031.
  41. M. A. G. Hazber, R. Li, B. Li, Y. Zhao, and K. M. A. Alalayah, "A survey: Transformation for integrating relational database with semantic Web," in Proc. 3rd Int. Conf. Manage. Eng., Softw. Eng. Service Sci. (ICMSS), Wuhan, China, 2019, pp. 66-73, doi: 10.1145/3312662.3312692.

M. Asfand-e-yar, R. Ali: Семантическая интеграция разнородных баз данных одного домена с использованием онтологии

MUHAMMAD ASFAND-E-YAR получил степени бакалавра и магистра в Международном исламском университете, Исламабад, Пакистан, в 2001 и 2004 годах соответственно, и степень доктора философии в Венском технологическом университете, Вена, Австрия, в 2011 году.

Он работал в NUCES-FAST в течение двух лет в качестве лектора, с 2004 по 2006 год в Пешаваре, Пакистан. После завершения докторской степени он работал исследователем в проекте Secure Business Austria в 2012 году в течение двух лет. Он работал в Университете Масарика, Брно, Чешская Республика, в качестве исследователя в течение 1,5 лет, в 2014 году. В 2015 году он присоединился к Университету Бахрия, Исламабад, работая доцентом на кафедре компьютерных наук, работая до сих пор. В настоящее время он работает в различных исследовательских проектах, связанных с семантической классификацией и обработкой языка. Его области интересов в исследованиях — семантическая классификация, инженерия онтологий, обработка естественного языка, глубокое обучение и архитектуры интеллектуальных зданий.

Доктор Асфанд-е-яр выиграл стипендию HEC, Пакистан, для обучения за рубежом на степень доктора философии. В 2013 году он выиграл стипендию ERCIM для пост-дока и работал в Университете Масарика. В Университете Масарика он разработал онтологическую модель для интеграции разнородных баз данных строительных технологий и структурированной информации о физическом здании.

RAMIS ALI получил степени бакалавра наук и магистра наук в области компьютерных наук в Университете Бахрия, Исламабад, Пакистан, в 2015 и 2018 годах соответственно. В настоящее время он работает младшим преподавателем в Университете Бахрия. Его исследовательские интересы включают связывание разнородных данных с использованием семантической веб-паутины и техник информационного поиска, обработку изображений и техники машинного обучения. Его награды и почести включают золотую медаль в степени магистра наук и серебряную медаль в степени бакалавра наук в Университете Бахрия.